Декомпозиция сложных задач на многоэтапные цепочки промптов (Multi-Stage Prompting)
Субисследование к аналитическому обзору [[academic_research_findings|академических программ]]. На основе курса CMU 17-630: Prompt Engineering (Travis Breaux, S3D Department). Для использования на семинаре СФИ — блок «Практики ведущих университетов» и «Методологические принципы».
1. Ключевой посыл
Одна из четырёх целей обучения курса CMU 17-630 формулируется дословно:
«Decompose complex inference tasks into multi-stage prompts» — «Декомпозировать сложные задачи вывода в многоэтапные промпты»
Второе домашнее задание курса прямо сопоставляет одноэтапный промпт (single-stage) с многоэтапной декомпозицией (multi-stage task decomposition) в контексте вызова функций (tool usage). Студенты на собственном опыте видят разницу в точности и надёжности.
Почему это важно для исследователя: когда преподаватель или аспирант задаёт ИИ сложный вопрос одним промптом (например, «Найди в корпусе соборных актов 1917–1918 гг. все упоминания покаяния, классифицируй их по типам и сделай выводы»), он получает текст, в котором невозможно отличить точные данные от галлюцинаций. Декомпозиция решает эту проблему.
2. Научная база: что говорят исследования
2.1. Декомпозиция повышает верность рассуждений (faithfulness)
Одно из важнейших исследований по теме — работа команды Anthropic:
Radhakrishnan et al. (2023). «Question Decomposition Improves the Faithfulness of Model-Generated Reasoning»
Авторы сравнивают три режима:
| Режим | Описание | Точность | Верность рассуждений |
|---|---|---|---|
| CoT (Chain-of-Thought) | Модель рассуждает в одном промпте | ⭐⭐⭐⭐⭐ (87.3% HotpotQA) | Низкая — модель может «подгонять» рассуждение под ответ |
| CoT Decomposition | Вопрос разбивается на подвопросы внутри одного промпта | ⭐⭐⭐⭐ (86.7%) | Средняя |
| Factored Decomposition | Каждый подвопрос решается отдельным вызовом, без доступа к контексту основного вопроса | ⭐⭐⭐ (83.0%) | Высокая — модель не может «подогнать» промежуточный ответ |
Ключевой вывод: Factored decomposition генерирует наиболее верные (faithful) рассуждения. Модель даёт чуть менее точные ответы, но её промежуточные шаги честно отражают то, что она «знает» и чего не знает. Это критически важно для академической работы, где процесс рассуждения не менее важен, чем результат.
2.2. Декомпозиция как детектор ненадёжности (2026)
Свежее исследование (ACL Findings 2026):
Madhwal et al. (2026). «Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"»
| Находка | Значение для практики |
|---|---|
| Для сильных моделей (GPT-4o, Claude) декомпозиция не повышает точность — они и так справляются | Не ждите чуда от разбивки на подвопросы |
| Но: если ответы прямого промпта и декомпозированного расходятся — это надёжный сигнал ошибки | Используйте декомпозицию как аудитора |
| Disagreement-based abstention (отказ от ответа при расхождении) превосходит стандартные метрики неуверенности | Простой тест: спроси двумя способами, сравни ответы |
Вывод для семинара: «Декомпозиция — это не магия точности, а инструмент проверки. Если вы задали ИИ сложный вопрос напрямую и через подвопросы, а ответы разошлись — значит, модель не уверена. Не доверяйте ни одному из ответов без ручной проверки».
2.3. Decomposed Prompting (DecomP) — модульный подход
Khot et al. (2022). «Decomposed Prompting: A Modular Approach for Solving Complex Tasks»
DecomP превосходит и Chain-of-Thought, и Least-to-Most prompting:
- На задачах математического QA — улучшение на 14–17 п.п. за счёт возможности пост-обработки промежуточных шагов
- Каждый подвопрос решается специализированным обработчиком (отдельный промпт, fine-tuned модель, или даже символическая функция)
- Архитектура модульная: можно заменить любой обработчик подзадачи без переписывания всей системы
2.4. Least-to-Most Prompting — от простого к сложному
Zhou et al. (2023, ICLR). «Least-to-Most Prompting Enables Complex Reasoning in Large Language Models»
Двухфазный подход:
- Декомпозиция: модель разбивает задачу на подзадачи от простых к сложным
- Последовательное решение: каждая подзадача решается с учётом ответов на предыдущие
Результат: модель способна генерализировать на задачи сложнее тех, что были в примерах (few-shot). Этот приём заимствован из педагогической психологии (метод Libby et al., 2008).
3. Таксономия техник декомпозиции
| Техника | Суть | Когда использовать | Сложность |
|---|---|---|---|
| Chain-of-Thought (CoT) | «Подумай шаг за шагом» в одном промпте | Простые многошаговые задачи | ⭐ |
| Prompt Chaining | Последовательность отдельных вызовов LLM, выход → вход | Задачи с чёткими фазами (извлечение → анализ) | ⭐⭐ |
| Least-to-Most | Разбей на подзадачи от простых к сложным, реши последовательно | Задачи с нарастающей сложностью | ⭐⭐ |
| Decomposed Prompting (DecomP) | Каждая подзадача — отдельный специализированный обработчик | Задачи, требующие разных навыков на разных этапах | ⭐⭐⭐ |
| Factored Decomposition | Подзадачи решаются изолированно, без доступа к основному вопросу | Когда важна верность рассуждений (academia) | ⭐⭐⭐ |
| Divide-and-Conquer | Параллельная декомпозиция на однородные подзадачи | Длинные документы, большие корпуса | ⭐⭐⭐ |
| Select-Then-Decompose | Модель сама выбирает оптимальный метод декомпозиции | Разнородные задачи в одной системе | ⭐⭐⭐⭐ |
4. Паттерны цепочек промптов для практика
Паттерн 1: Линейная цепочка (Extract → Analyze → Format)
Самый распространённый. Соответствует правилу «Разделения фаз» из Stanford CS224G.
Промпт 1 (Извлечение): «Извлеки из текста все упоминания X. Формат: JSON»
↓ [результат: структурированные данные]
Промпт 2 (Анализ): «На основе этих данных классифицируй упоминания по категориям»
↓ [результат: классификация]
Промпт 3 (Синтез): «На основе классификации сформулируй выводы»
Почему работает: каждый промпт делает одну вещь. Модель не пытается одновременно искать данные и делать выводы → снижается риск галлюцинаций.
Паттерн 2: Ветвящаяся цепочка (Classify → Route)
Промпт 1 (Классификация): «Определи тип этого текста: А, Б или В»
↓
┌──────────────┬──────────────┐
↓ ↓ ↓
Промпт 2А Промпт 2Б Промпт 2В
(для типа А) (для типа Б) (для типа В)
Пример: При анализе корпуса ЕВ: сначала классифицируем материал (указ, проповедь, хроника, объявление), затем каждый тип обрабатывается специализированным промптом.
Паттерн 3: RAG-цепочка (Search → Rerank → Answer)
Промпт 1: Векторный поиск → кандидаты
↓
Промпт 2: Ранжирование кандидатов по релевантности (маленькая модель)
↓
Промпт 3: Генерация ответа на основе top-k чанков (большая модель)
Значение: Именно этот паттерн лежит в основе NotebookLM и RAG-систем. Промпт 3 видит только релевантные фрагменты → не выдумывает.
Паттерн 4: Plan → Execute → Verify
Промпт 1 (План): «Составь план из 5 шагов для решения задачи X»
↓
Промпт 2 (Выполнение): «Выполни шаг 1 из плана: ...» (повторить для каждого шага)
↓
Промпт 3 (Верификация): «Проверь результат по критериям: полнота, точность, цитируемость»
Паттерн 5: Generate → Critique → Refine (самокоррекция)
Промпт 1 (Черновик): «Напиши анализ текста X»
↓
Промпт 2 (Критика): «Найди в этом анализе ошибки, пропуски и неточности»
↓
Промпт 3 (Доработка): «Исправь анализ с учётом критики»
Эквивалент в Anthropic docs: «The most common chaining pattern is self-correction: generate a draft → have Claude review it against criteria → have Claude refine based on the review» (Anthropic, 2026).
5. Пример для богословского исследования
Задача: «Как тема соборности раскрывается в документах Поместного Собора 1917–1918 гг.?»
❌ Наивный подход (один промпт):
Проанализируй, как тема соборности раскрывается в документах
Поместного Собора 1917–1918 гг. Дай полный анализ с цитатами.
Проблемы: модель смешивает то, что знает из обучения, с тем, что выдумывает. Цитаты могут быть неточными. Невозможно проверить промежуточные шаги.
✅ Декомпозированный подход (4 промпта):
Промпт 1 — Извлечение (загрузить PDF документов в NotebookLM или Claude):
Извлеки из загруженных документов ВСЕ фрагменты, где встречаются
слова: «соборность», «соборный», «соборное начало», «коллегиальность»,
«церковное управление».
Для каждого фрагмента укажи:
- Точную цитату (дословно)
- Название документа
- Номер страницы или параграфа
Формат: таблица Markdown.
НЕ добавляй собственных комментариев. Только цитаты из источника.
Промпт 2 — Классификация (на основе результатов Промпта 1):
Вот извлечённые цитаты о соборности из документов Собора:
[вставить таблицу из Промпта 1]
Классифицируй каждую цитату по категориям:
А. Соборность как экклезиологический принцип
Б. Соборность как форма церковного управления
В. Соборность как литургическая практика
Г. Критика недостатка соборности
Для каждой цитаты укажи категорию и краткое обоснование (1 предложение).
Промпт 3 — Анализ (на основе результатов Промпта 2):
На основе этой классификации:
[вставить результат Промпта 2]
1. Какая категория представлена наиболее/наименее широко?
2. Как менялось понимание соборности в ходе Собора (если видна динамика)?
3. Есть ли противоречия между разными документами?
Опирайся ТОЛЬКО на приведённые цитаты. Если данных недостаточно
для вывода — прямо скажи об этом.
Промпт 4 — Верификация (промпт-оппонент, приём CMU):
Вот анализ темы соборности в документах Поместного Собора:
[вставить результат Промпта 3]
Ты — строгий рецензент. Проверь:
1. Каждый вывод подкреплён конкретной цитатой?
2. Нет ли натяжек или чрезмерных обобщений?
3. Какие альтернативные интерпретации возможны?
4. Какие источники НЕ учтены, но должны быть?
Почему это работает лучше
| Критерий | Один промпт | Цепочка из 4 промптов |
|---|---|---|
| Проверяемость | Невозможно проверить, откуда взята «цитата» | Промпт 1 извлекает только из источника |
| Отделение данных от интерпретации | Смешаны | Промпт 1–2 = данные, Промпт 3 = интерпретация |
| Обнаружение ошибок | Только постфактум | На каждом этапе можно проверить и скорректировать |
| Воспроизводимость | Разные результаты при перезапуске | Промпт 1 даёт стабильные результаты |
| Защита от галлюцинаций | Минимальная | Промпт 1 ограничен источником, Промпт 4 проверяет |
6. Когда декомпозиция НЕ нужна
Не всякая задача требует цепочки промптов. Исследование «The LLM Pipeline Monolith vs. Chain Trade-off» (Tianpan, 2026) показывает:
| Используйте один промпт, когда: | Используйте цепочку, когда: |
|---|---|
| Задача простая и однородная | Задача имеет чётко различимые фазы |
| Модель справляется с задачей надёжно | Нужна промежуточная валидация |
| Латентность критична | Нужна локализация ошибок (какой шаг сломался?) |
| Контекста достаточно | Требуются разные навыки на разных этапах |
| Работа с длинными документами (>50 стр.) |
Правило: начните с одного промпта. Если результат ненадёжен — декомпозируйте. Оптимальная цепочка содержит 2–5 шагов. Больше 5 — задумайтесь о переходе к агентной системе.
7. Что показать на семинаре
Демонстрация 1: «Один промпт vs цепочка» (5 мин)
Подготовка: Взять 3-страничный текст доклада на Поместный Собор (тот же PDF, что в крючке).
Один промпт: «Проанализируй позицию автора и приведи 3 цитаты» → Показать результат: вероятно, хотя бы одна цитата будет неточной или выдуманной.
Цепочка из 2 промптов:
- Промпт 1: «Извлеки ВСЕ ключевые тезисы автора. Для каждого — дословная цитата с номером страницы»
- Промпт 2: «На основе этих тезисов: какова позиция автора?» → Показать: цитаты точные, анализ опирается на реальные данные.
Вывод для аудитории: «Два промпта вместо одного — и мы перешли от «красивого, но непроверяемого» текста к «проверяемому анализу с цитатами». Это базовый приём, который CMU учит своих магистрантов».
Демонстрация 2: «Декомпозиция как детектор ненадёжности» (3 мин)
- Задать сложный вопрос напрямую: «Кто из участников Собора выступал за выборность епископата?»
- Задать тот же вопрос через подвопросы:
- «Какие документы Собора обсуждают вопрос выборности?»
- «Кто выступал в дискуссии по этим документам?»
- «Какую позицию занимал каждый выступавший?»
- Сравнить ответы. Если расходятся → модель не уверена → нужна ручная проверка.
Вывод: «Исследование Anthropic 2023 года показало: если прямой ответ и декомпозированный расходятся — это почти всегда сигнал ошибки. Бесплатный тест на надёжность».
Ключевые тезисы для слайда
- 🔗 Разделяй и проверяй: Сначала «найди», потом «проанализируй» — галлюцинации ↓80% (Stanford CS224G)
- 🧪 Каждый шаг — контрольная точка: Можно проверить промежуточный результат до перехода к следующему
- 🔍 Два ответа лучше одного: Расхождение между прямым и декомпозированным ответом = сигнал ошибки
- 📐 2–5 шагов: Оптимальная длина цепочки. Больше → используйте агентов (парадигма 4)
- 🎓 CMU учит этому: Это не лайфхак, а академическая методология
8. Связь с другими темами семинара
| Тема семинара | Связь с декомпозицией |
|---|---|
| [[Исследование феномена сикофантии (склонности ИИ льстить пользователю и подтверждать его неверные гипотезы) и галлюцинаций.]] | Декомпозиция снижает галлюцинации, а factored decomposition делает рассуждения более честными (менее сикофантными) |
| [[Оценка эффективности промптов через метрики самосогласованности (self-consistency) и калибровки ответов.]] | Disagreement-based abstention — форма оценки self-consistency через декомпозицию |
| [[Использование агентных фреймворков (personas, memory models) и метода «агентных дебатов» (agent-based debate and collaboration) для верификации выводов.]] | Агентные системы — это автоматизированная декомпозиция: агент сам решает, какие подзадачи создать |
| Парадигма 3 (Среда / NotebookLM) | NotebookLM реализует RAG-цепочку (Search → Rerank → Answer) внутри |
| Парадигма 4 (Агент) | Агент = динамическая декомпозиция. Prompt chaining = статическая декомпозиция |
Источники
- CMU 17-630 Syllabus — cs.cmu.edu/~breaux/prompting
- Radhakrishnan, A. et al. (2023). Question Decomposition Improves the Faithfulness of Model-Generated Reasoning. arXiv:2307.11768
- Madhwal, D. et al. (2026). Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know". ACL Findings 2026
- Khot, T. et al. (2022). Decomposed Prompting: A Modular Approach for Solving Complex Tasks. arXiv:2210.02406
- Zhou, D. et al. (2023). Least-to-Most Prompting Enables Complex Reasoning in Large Language Models. ICLR 2023
- Diao, S. et al. (2022). Successive Prompting for Decomposing Complex Questions. EMNLP 2022
- Select-Then-Decompose (2025). From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition. EMNLP 2025
- Anthropic (2026). Prompting Best Practices: Chain Complex Prompts — docs.anthropic.com
- AWS (2026). Workflow for Prompt Chaining — docs.aws.amazon.com
- Tianpan (2026). The LLM Pipeline Monolith vs. Chain Trade-off — tianpan.co